智能论文笔记

Capturing and Inferring Dense Full-Body Human-Scene Contact

Chun-Hao P. Huang , Hongwei Yi , Markus Höschle , Matvey Safroshkin , Tsvetelina Alexiadis , Senya Polikovsky , Daniel Scharstein , Michael J. Black

分类：计算机视觉

2022-06-20

推断人类场景接触（HSC）是了解人类如何与周围环境相互作用的第一步。尽管检测2D人类对象的相互作用（HOI）和重建3D人姿势和形状（HPS）已经取得了重大进展，但单个图像的3D人习惯接触的推理仍然具有挑战性。现有的HSC检测方法仅考虑几种类型的预定义接触，通常将身体和场景降低到少数原语，甚至忽略了图像证据。为了预测单个图像的人类场景接触，我们从数据和算法的角度解决了上述局限性。我们捕获了一个名为“真实场景，互动，联系和人类”的新数据集。 Rich在4K分辨率上包含多视图室外/室内视频序列，使用无标记运动捕获，3D身体扫描和高分辨率3D场景扫描捕获的地面3D人体。 Rich的一个关键特征是它还包含身体上精确的顶点级接触标签。使用Rich，我们训练一个网络，该网络可预测单个RGB图像的密集车身场景接触。我们的主要见解是，接触中的区域总是被阻塞，因此网络需要能够探索整个图像以获取证据。我们使用变压器学习这种非本地关系，并提出新的身体场景接触变压器（BSTRO）。很少有方法探索3D接触；那些只专注于脚的人，将脚接触作为后处理步骤，或从身体姿势中推断出无需看现场的接触。据我们所知，BSTRO是直接从单个图像中直接估计3D身体场景接触的方法。我们证明，BSTRO的表现明显优于先前的艺术。代码和数据集可在https://rich.is.tue.mpg.de上获得。

translated by 谷歌翻译